信息采集统一过滤方案:多源并行采集 → 三层过滤 → 统一叙述报告
TL;DR
将多个信息源(RSS/Reddit/YouTube/B站/小红书)的采集从各自独立触发改为统一汇总+三层过滤(此心不动→全球共鸣→四象限),产出一份可读的叙述报告,报告内容自动分配至创作/商业管道或知识库。
触发场景
- 设计信息采集与过滤的自动化 pipeline
- 解决多信息源碎片化、无统一视角的问题
- 需要从海量信息中提取可行动的创作/商业信号
行动步骤
- 各信息源在各自高峰后独立采集(RSS 08:50 / Reddit 09:05 / YouTube 14:30)
- 09:30 统一汇总所有采集文件
- 对每条信息执行三层过滤:
- 第一层:此心不动(四层内核:无机/生物/社会/心智)
- 第二层:全球共鸣(翻译为普世性问题)
- 第三层:四象限判断(A主战场/B中文背景/C红海存档/D直接删除)
- 输出一份可读性良好的叙述报告(非条目列表)
- A 象限自动进入创作/商业机会管道,B 象限进入知识库
- 推送飞书:文件路径 + 关键洞察摘要
证据
- 完整方案文档(含 cron 配置、skill 设计、RSS 源建议、Reddit 子版建议)
- 新 cron 时序已设计:08:20-09:30 为采集窗口,09:30 为统一过滤节点
失败边界
- 任何信息源的采集失败不应阻塞统一过滤(降级为可用数据源处理)
- 四象限判断依赖 AI 质量,错判率需持续监控
- RSS/Reddit 采集依赖外部服务可用性
原理
信息碎片化的根本问题不是采集不够多,而是缺少一个统一的"意义建构"环节。三层过滤器将信息从"发生了什么"升级到"这对我意味着什么",实现从信息到行动的转化。